ANOVA à un facteur

2eme-FA-EMS - BUT SD - E. Anakok

library(tidyverse)
library(extrafont) 
require(ggsci)
library(ggpubr)
library(knitr)
library(ggfortify)
library(ggrepel)
library(corrplot)

1 Introduction

1.1 Ce qu’il faut retenir de ce cours

TipEncodage 1 parmi p

\[ X = \begin{bmatrix} \text{Groupe 1} \\ \text{Groupe 2} \\ \text{Groupe 1} \\ \text{Groupe 3} \\ \text{Groupe 2} \\ \text{Groupe 3} \end{bmatrix} \quad \text{en} \quad X^{(1)} = \left[\begin{array}{ccc} \text{Groupe 1} & \text{Groupe 2} & \text{Groupe 3} \\ 1 & 0 & 0 \\ 0 & 1 & 0 \\ 1 & 0 & 0 \\ 0 & 0 & 1 \\ 0 & 1 & 0 \\ 0 & 0 & 1 \end{array}\right] \]

Problème : Le modèle ainsi défini n’est pas identifiable.

NoteDéfinition : ANOVA à un facteur sans intercept

\[Y = X^{(1)}\theta + E\]

  • \(Y = [Y_1,\dots,Y_n]^t\) les v.a. à expliquer.

  • \(X^{(1)}\) est la matrice encodée du facteur sans l’intercept.

  • \(\theta = [\mu_1,\dots,\mu_p]^t\).

  • \(E \sim \mathcal{N}(0,\sigma^2 I_n)\).

NoteDéfinition : ANOVA à un facteur avec groupe de référence

\[Y = X^{(1)}\theta + E\]

  • \(Y = [Y_1,\dots,Y_n]^t\) les v.a. à expliquer.

  • \(X^{(1)}\) est la matrice encodée du facteur sans le groupe 1.

  • \(\theta = [\beta,\alpha_2,\dots,\alpha_p]^t\).

  • \(E \sim \mathcal{N}(0,\sigma^2 I_n)\).

1.2 Introduction

WarningObjectifs
  • Expliquer une variable continue en fonction d’une variable catégorielle (appelée facteur).

  • Généralisation du test d’égalité de deux espérances (vu en cours sur les tests) à \(p\) espérances, si le facteur a \(p\) modalités

NoteDonnées
  • Les valeurs (continues) \(y_i\) pour \(1\leq i \leq n\)
  • Une classe pour chaque individu \(i\)

1.3 Exemple

WarningObjectif

Étude de la prise de poids d’individus en fonction de leurs régime

NoteDonnées

Pour \(n= 76\) individus on a :

  • Une variable réponse à expliquer :

    • Leur prise de poids (mesurée en kg)
  • Un facteur explicatif à \(p= 3\) niveau (modalités):

    • Régime 1
    • Régime 2
    • Régime 3

1.4 Les données

diet <- read.table(file = "Diet.txt", header = TRUE, sep =";" )
diet$Diet <- as.factor(diet$Diet)
kable(head(diet))
Diet Diff_poid
1 1.5
3 4.5
3 3.5
2 2.0
1 1.1
1 3.5

1.5 Étude univariées des données

summary(diet$Diff_poid)
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
 -2.100   2.300   3.700   3.946   5.650   9.200 

Les individus perde jusqu’à 2,1 kg et gagne jusqu’à 9,2 kg.

table(diet$Diet)

 1  2  3 
24 25 27 

24 individus ont fait le régime 1, 25 ont fait le régime 2, et 27 ont fait le régime 3

library(ggbeeswarm)
ggplot(diet, aes(x= Diet, y = Diff_poid, color = Diet))+
  geom_boxplot()+
  geom_beeswarm(alpha = 0.5)

1.6 Exemple

Étude de l’effet du régile sur la variable différence de poids (mesuré en kg).

  • Une variable réponse continue : “la prise” de poids

  • Un facteur explicatif à \(p=3\) niveaux (modalités) codé en

    • Régime 1
    • Régime 2
    • Régime 3

Comment analyser ces données ?

  • On va calculer une estimation moyenne de prise de poids par régime.

1.7 Écriture du modèle

NoteDéfinition

Pour \(1\leq i \leq n\) et \(1\leq j \leq p\)

  • \(y_{i,j}\) l’observation de la variable réponse du \(i\)-ème individu qui a la modalité \(j\)

  • On suppose que \(y_{i,j}\) est la réalisation d’une variable aléatoire \(Y_{i,j}\) telle que

\[Y_{i,j} \sim \mathcal{N}(\mu_j,\sigma^2) \]\(Y_{i,j}\) est la variable aléatoire liée à l’individu \(i\) de la modalité \(j\), les \(Y_{i,j}\) sont indépendants.

CautionRemarques : Nombre de paramètres
  • \(p\) paramètres d’espérance (1 par modalité)
  • 1 paramètre de variance

1.8 Trouver les paramètres (\(\mu_j\) et \(\sigma^2\))

NoteCe que l’on sait faire

Trouver les paramètres d’espérance \(\theta\) tel que

\[Y = X\theta + E,\quad E \sim \mathcal{N}(0,\sigma^2 I_n)\]

WarningProblème
  • Pour le modèle linéaire, \(X\) doit être numérique (quantitatif).
  • Ici, \(X\) est une catégorie (qualitatif).

1.9 Encodage one-hot ou encodage 1 parmi \(p\)

TipIdée

Transformer la variable qualitative à \(p\) modalité \(\Longrightarrow\) \(p\) variables 0/1

TipExemple

\[ R = \begin{bmatrix} \text{Régime 1} \\ \text{Régime 2} \\ \text{Régime 1} \\ \text{Régime 3} \\ \text{Régime 2} \\ \text{Régime 3} \end{bmatrix} \quad \text{en} \quad X^{(1)} = \left[\begin{array}{ccc} \text{Régime 1} & \text{Régime 2} & \text{Régime 3} \\ 1 & 0 & 0 \\ 0 & 1 & 0 \\ 1 & 0 & 0 \\ 0 & 0 & 1 \\ 0 & 1 & 0 \\ 0 & 0 & 1 \end{array}\right] \]

1.10 Notations

TipModèle linéaire multiple
  • \(y_i\) la valeur de la variable réponse.
  • \(X^{(1)}_{i,1}\) est égale à 1 si l’individu \(i\) à fait le régime 1 et 0 sinon.
  • \(X^{(1)}_{i,2}\) est égale à 1 si l’individu \(i\) à fait le régime 2 et 0 sinon.
  • \(X^{(1)}_{i,3}\) est égale à 1 si l’individu \(i\) à fait le régime 3 et 0 sinon.
Note

Dans un premier temps, on pourra écrire :

\[Y_i = \beta + \alpha_1X^{(1)}_{i,1}+ \alpha_2X^{(1)}_{i,2}+ \alpha_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2) \]

Attention ! Ce modèle présente un problème, qu’on verra plus tard…

1.11 Interprétation du modèle

CautionRemarque

\[Y_i = \beta + \alpha_1X^{(1)}_{i,1}+ \alpha_2X^{(1)}_{i,2}+ \alpha_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2) \] Pour un \(i \in \{1,\dots,n\}\), il n’y a qu’un seul des \(X^{(1)}_{i,1},X^{(1)}_{i,2},X^{(1)}_{i,3}\) qui est égale à 1 et les autres valent 0.

  • Si l’individu \(i\) fait le régime 1 : \(X^{(1)}_{i,1}= 1\) et \(X^{(1)}_{i,2}=0,X^{(1)}_{i,3}=0\), donc \[Y_i = \beta + \alpha_1 + E_i \]

  • Si l’individu \(i\) fait le régime 2 : \(X^{(1)}_{i,2}= 1\) et \(X^{(1)}_{i,1}=0,X^{(1)}_{i,3}=0\), donc \[Y_i = \beta + \alpha_2 + E_i \]

  • Si l’individu \(i\) fait le régime 3 : \(X^{(1)}_{i,3}= 1\) et \(X^{(1)}_{i,1}=0,X^{(1)}_{i,2}=0\), donc \[Y_i = \beta + \alpha_3 + E_i \]

La prise de poid de l’individu \(i\) est modélisée par une valeur globale plus une valeur dépendant de son régime et d’une erreur

On notant \(\mu_j = \beta + \alpha_j\) on retrouve bien \(Y_{i,j} \sim \mathcal{N}(\mu_j,\sigma^2)\)

1.12 Écriture matricielle

\[ Y = X\theta + E\]

\[ X = \left[\begin{array}{cccc}\text{intercept} & \text{Régime 1} & \text{Régime 2} & \text{Régime 3} \\ 1 & 1 & 0 & 0 \\ 1 & 0 & 1 & 0 \\1 & 1 & 0 & 0 \\1 & 0 & 0 & 1 \\1 & 0 & 1 & 0 \\1 & 0 & 0 & 1 \\ \vdots &\vdots &\vdots &\vdots \end{array}\right] \]

  • \(E\sim \mathcal{N}(0,\sigma^2I_n)\)
  • Problème ? Les collones de \(X\) sont colinéaires. En effet, on a \(X^{(1)}_{i,1}+X^{(1)}_{i,2} + X^{(1)}_{i,3} = 1\). La somme des trois dernières colonnes de \(X\) est égale à la première

1.13 Identifiabilité

CautionRemarque

Le modèle \[Y_i = \beta + \alpha_1X^{(1)}_{i,1}+ \alpha_2X^{(1)}_{i,2}+ \alpha_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2) \] n’est pas identifiable.

Il y a 4 paramètres d’espérance alors qu’il n’y a que 3 groupes.

1.14 Solution

Pour résoudre ce problème, on va retirer une colonne de \(X\).

\(\iff\) mettre une contrainte obligeant un des paramètres à ếtre égale à 0.

Deux possibilités :

NoteModèle sans intercept

On retire la première colonne de \(X\)

\(\iff \beta = 0\)

\[Y_i = \mu_1X^{(1)}_{i,1}+ \mu_2X^{(1)}_{i,2}+ \mu_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2) \]

NoteModèle avec groupe de référence

On retire une autre colonne de \(X\), par exemple la seconde

\(\iff \alpha_1 = 0\) On dira alors que le groupe 1 est le groupe de référence.

\[Y_i =\beta + \alpha_2X^{(1)}_{i,2}+ \alpha_3X^{(1)}_{i,3} + E_i,\quad E_i\overset{i.i.d}\sim\mathcal{N}(0,\sigma^2)\]

2 Modèle sans intercept

2.1 Notation matricielle dans l’exemple

NoteDéfinition : ANOVA à un facteur sans intercept

\[Y = X^{(1)}\theta + E\]

  • \(Y = [Y_1,\dots,Y_n]^t\) les v.a. liées à la prise de poids de l’individu \(\{1, \dots,n\}\).

  • \(X^{(1)}\) est la matrice encodée du facteur “type de régime”.

  • \(\theta = [\mu_1,\mu_2,\mu_3]^t\).

  • \(E \sim \mathcal{N}(0,\sigma^2 I_n)\).

La prise de poid de l’individu \(i\) est modélisée par une valeur dépendant de son régime et une erreur

2.2 Notation matricielle

NoteDéfinition : ANOVA à un facteur sans intercept

\[Y = X^{(1)}\theta + E\]

  • \(Y = [Y_1,\dots,Y_n]^t\) les v.a. à expliquer.

  • \(X^{(1)}\) est la matrice encodée du facteur sans l’intercept.

  • \(\theta = [\mu_1,\dots,\mu_p]^t\).

  • \(E \sim \mathcal{N}(0,\sigma^2 I_n)\).

CautionRemarques

On retombe bien sur le modèle

\[Y_{i,j} = \mu_j + E_i, \quad E_i\overset{i.i.d.}{\sim}\mathcal{N}(0,\sigma^2)\]

\[\iff Y_{i,j}\sim\mathcal{N}(\mu_j,\sigma^2)\]

2.3 Estimation des \(\mu_j\)

NoteRappel

Dans le cadre du modèle linéaire multivarié \(Y = X\theta +E\)

L’estimateur de \(\theta\) est \(\widehat{\theta} = (X^tX)^{-1}X^tY\)

TipThéorème

Dans le cadre de l’ANOVA à un facteur, \(Y = X^{(1)}\theta +E\)

L’estimateur de \(\theta\) est \(\widehat{\theta} = \left({X^{(1)}}^tX^{(1)}\right)^{-1}{X^{(1)}}^tY\)

2.4 Calcul de \(\widehat{\theta}\) dans l’exemple

\[{X^{(1)}}^tX^{(1)} = \begin{bmatrix}n_1 & 0 & 0 \\0 & n_2 & 0\\ 0 & 0 & n_3 \end{bmatrix}\]

\[\left({X^{(1)}}^tX^{(1)}\right)^{-1} = \begin{bmatrix}\frac{1}{n_1} & 0 & 0 \\0 & \frac{1}{n_2} & 0\\ 0 & 0 & \frac{1}{n_3} \end{bmatrix}\]

\[{X^{(1)}}^tY = \begin{bmatrix}\sum_{i=1}^{n_1} Y_{i,1} \\ \sum_{i=1}^{n_2} Y_{i,2}\\ \sum_{i=1}^{n_3} Y_{i,3} \end{bmatrix}\]

\[\widehat{\theta} = \left({X^{(1)}}^tX^{(1)}\right)^{-1}{X^{(1)}}^tY = \begin{bmatrix}\frac{1}{n_1}\sum_{i=1}^{n_1} Y_{i,1} \\ \frac{1}{n_2}\sum_{i=1}^{n_2} Y_{i,2}\\ \frac{1}{n_3}\sum_{i=1}^{n_3} Y_{i,3} \end{bmatrix}\]

2.5 Interprétation

Finalement, pour \(j\in \{1,\dots,p\}\) (dans l’exemple \(p=3\)) on a

\[\widehat{\mu}_j = \frac{1}{n_j}\sum_{i=1}^{n_j}Y_{i,j} = \overline{Y_j} \]

Il s’agit de la moyenne empirique de \(Y\) dans la modalité \(j\)

library(ggbeeswarm)
ggplot(diet, aes( x = Diet, y = Diff_poid, color = Diet)) +
geom_boxplot() +
geom_beeswarm(alpha = 0.5) +
stat_summary(size = 2, shape = 4, fun = mean)

2.6 ANOVA sans intercept sur R

mod_ssinter <- lm(Diff_poid~ Diet - 1, data = diet)
summary(mod_ssinter)

Call:
lm(formula = Diff_poid ~ Diet - 1, data = diet)

Residuals:
    Min      1Q  Median      3Q     Max 
-5.3680 -1.4420  0.1759  1.6519  5.7000 

Coefficients:
      Estimate Std. Error t value Pr(>|t|)    
Diet1   3.3000     0.4840   6.818 2.26e-09 ***
Diet2   3.2680     0.4742   6.891 1.66e-09 ***
Diet3   5.1481     0.4563  11.282  < 2e-16 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 2.371 on 73 degrees of freedom
Multiple R-squared:  0.7519,    Adjusted R-squared:  0.7417 
F-statistic: 73.76 on 3 and 73 DF,  p-value: < 2.2e-16

2.7 Estimation du paramètre de variance

Comme en regression linéaire multiple. Par contre, on divise par \(n-p\) et non pas \(n-p-1\) car on a retiré l’intercept.

\[\begin{align} S^2_{(M_p)} &= \frac{SCR(M_p)}{n-p} = \frac{||Y - X\theta||^2}{n-p}\\ & = \frac{1}{n-p} \sum_{j=1}^{p}\sum_{i=1}^{n_j}(Y_{i,j} - \overline{Y_j})^2 \end{align}\]

2.8 Loi de \(\widehat\theta\)

\(\widehat\theta\) est un vecteur gaussien d’espérance \(\theta\) et de matrice de covariance

\[\mathbb{V}(\widehat\theta) = \sigma^2(X^tX)^{-1}\text{ estimée par } S^2_{(M_p)}(X^tX)^{-1}\]

On montre que \[\widehat{\theta}\sim \mathcal{N}(\theta,\sigma^2(X^tX)^{-1} ) \]

En particulier, pour tout \(k = 1, \cdots, p + 1\), si \(c_{kk} = (X^t X )^{−1}_{k,k}\) désigne le \(k\)-ème élément diagonal de \((X^tX)\)^{−1}, et \(\widehat{\theta}_k\) désigne le \(k\)-ème élément du vecteur \(\widehat{\theta}\), on a

\[\overline{Y}_k = \widehat{\theta}_k \sim \mathcal{N}(\theta_k,\sigma^2 c_{kk})\]

En remplaçant \(\sigma^2\) par son estimateur, on a :

\[ \frac{(\overline{Y}-\mu_k)}{\sqrt{S^2_{(M_p)}c_{kk}}} \sim \mathcal{T}(n-p)\]

2.9 Forme explicite de \(c_{kk}\)

\[\left({X^{(1)}}^tX^{(1)}\right)^{-1} = \begin{bmatrix}\frac{1}{n_1} & 0 & 0 \\0 & \frac{1}{n_2} & 0\\ 0 & 0 & \frac{1}{n_3} \end{bmatrix}\]

\[c_{kk} = \frac{1}{n_k}\] \[\overline{Y}_k = \widehat{\theta}_k \sim \mathcal{N}\left(\theta_k,\frac{\sigma^2}{n_k}\right)\]

En remplaçant \(\sigma^2\) par son estimateur, on a :

\[ \frac{(\overline{Y}-\mu_k)}{\sqrt{\frac{S^2_{(M_p)}}{n_k}}} \sim \mathcal{T}(n-p)\]

2.10 Intervalle de confiance du modèle sans intercept

TipIntervalle de confiance pour l’ANOVA à 1 facteur sans intercept

\[ IC_{1-\delta}(\mu_k) = \left[\overline{y}_i - t_{1-\frac{\delta}{2}}\frac{s_{M_p}}{\sqrt{n_i}};\;\overline{y}_i + t_{1-\frac{\delta}{2}}\frac{s_{M_p}}{\sqrt{n_i}} \right] \]

\(t_{1-\frac{\delta}{2}}\) est le quantile \(1-\frac{\delta}{2}\) de la loi \(\mathcal{T}(n-p)\)

confint(mod_ssinter, level = 0.95)
         2.5 %   97.5 %
Diet1 2.335407 4.264593
Diet2 2.322895 4.213105
Diet3 4.238721 6.057575

2.11 Test de Student

TipHypothèses

\[H_0 : \mu_k = 0 \text{ contre } H_1 : \mu_k \neq 0\]

CautionRemarques

Il s’agit d’un test de conformité de moyenne, on regarde si la moyenne de chaque groupe est significativement différente de 0.

TipStatistique de test

Sous \(H_0\), on a \[T_n = \frac{(\overline{Y}-\mu_k)}{\sqrt{\frac{S^2_{(M_p)}}{n_k}}}\sim\mathcal{T}(n-p)\]

CautionRemarques

À part l’estimation de \(\sigma^2\) c’est comme le test de Student vu en test paramétrique.

2.12 ANOVA sans intercept sur R

mod_ssinter <- lm(Diff_poid~ Diet - 1, data = diet)
summary(mod_ssinter)

Call:
lm(formula = Diff_poid ~ Diet - 1, data = diet)

Residuals:
    Min      1Q  Median      3Q     Max 
-5.3680 -1.4420  0.1759  1.6519  5.7000 

Coefficients:
      Estimate Std. Error t value Pr(>|t|)    
Diet1   3.3000     0.4840   6.818 2.26e-09 ***
Diet2   3.2680     0.4742   6.891 1.66e-09 ***
Diet3   5.1481     0.4563  11.282  < 2e-16 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 2.371 on 73 degrees of freedom
Multiple R-squared:  0.7519,    Adjusted R-squared:  0.7417 
F-statistic: 73.76 on 3 and 73 DF,  p-value: < 2.2e-16

2.13 Test de Fisher

TipHypothèses

\(H_0\): On est dans le modèle \(M_0 : Y_i = E_i\)

contre

\(H_1\): On est dans le modèle \(M_p : Y_{i,j} = \mu_j + E_i\)

TipAutre formulation

\(H_0\): On est dans le modèle \(M_0 : \mu_1 = \mu_2 = \dots = \mu_p = 0\)

contre

\(H_1\): On est dans le modèle \(M_p : \exists j \in \{1,\dots,j\}, \mu_j \neq 0\)

m0 <- lm(Diff_poid~0, data = diet)
anova(m0, mod_ssinter)
Analysis of Variance Table

Model 1: Diff_poid ~ 0
Model 2: Diff_poid ~ Diet - 1
  Res.Df    RSS Df Sum of Sq      F    Pr(>F)    
1     76 1654.3                                  
2     73  410.4  3      1244 73.755 < 2.2e-16 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

2.14 Remarques

CautionRemarques
  • Le test de Student : compare les moyennes des groupes à 0.
  • Le test de Fisher test si au moins une des moyennes est à 0.

\(\Longrightarrow\) Il n’y a pas de comparaison des moyennes entre elles !

3 ANOVA avec groupe de référence

3.1 Notation non matricielle dans l’exemple

NoteDéfinition : ANOVA à un facteur avec groupe de référence

\[Y_i = \beta + \alpha_ 2X_{i,2}^{(1)}+ \alpha_ 3X_{i,3}^{(1)} + E_i \]

Si l’individu \(i\) a fait le régime 1, qui est le régime de référence, alors \(X_{i,2}^{(1)} = 0\) et \(X_{i,3}^{(1)} = 0\) donc

\[Y_i = \beta + E_i \]

Si l’individu \(i\) a fait le régime 2, alors \(X_{i,2}^{(1)} = 1\) et \(X_{i,3}^{(1)} = 0\) donc

\[Y_i = \beta +\alpha_2+ E_i \]

Si l’individu \(i\) a fait le régime 3, alors \(X_{i,2}^{(1)} = 0\) et \(X_{i,3}^{(1)} = 1\) donc

\[Y_i = \beta +\alpha_3+ E_i \]

La prise de poid de l’individu \(i\) est modélisée par une valeur de référence plus une valeur dépendant de son régime et une erreur

3.2 Notation matricielle dans l’exemple

NoteDéfinition : ANOVA à un facteur avec groupe de référence

\[Y = X^{(1)}\theta + E\]

  • \(Y = [Y_1,\dots,Y_n]^t\) les v.a. liées à la prise de poids de l’individu \(\{1, \dots,n\}\).

  • \(X^{(1)}\) est la matrice encodée du facteur “type de régime” sans la première colonne.

\[X^{(1)} = \left[\begin{array}{ccc}\text{intercept} & \text{Régime 2} & \text{Régime 3} \\ 1 & 0 & 0 \\ 1 & 1 & 0 \\1 & 0 & 0 \\1 & 0 & 1 \\1 & 1 & 0 \\1 & 0 & 1 \\ \vdots &\vdots &\vdots \end{array}\right]\]

  • \(\theta = [\beta,\alpha_2,\alpha_3]^t\).

  • \(E \sim \mathcal{N}(0,\sigma^2 I_n)\).

La prise de poid de l’individu \(i\) est modélisée par une valeur de référence plus une valeur dépendant de son régime et une erreur

3.3 Interprétation des paramètres

Pour le régime 1 : \[Y_{i,1}\sim\mathcal{N}(\beta,\sigma^2)\]

donc \(\beta = \mu_1\), il s’agit de la moyenne du groupe de référence.

Pour le régime 2 : \[Y_{i,1}\sim\mathcal{N}(\beta + \alpha_2,\sigma^2)\]

\(\mu_2 = \mu_1+ \alpha_2\), donc \(\alpha_2 = \mu_2 - \mu_1\) \(\Longrightarrow\alpha_2\) représente l’écart en moyenne entre le régime 2 et le régime de référence 1.

Pour le régime 3 : \[Y_{i,1}\sim\mathcal{N}(\beta + \alpha_3,\sigma^2)\]

\(\mu_3 = \mu_1+ \alpha_3\), donc \(\alpha_3 = \mu_3 - \mu_1\) \(\Longrightarrow\alpha_3\) représente l’écart en moyenne entre le régime 3 et le régime de référence 1.

3.4 Notation matricielle

NoteDéfinition : ANOVA à un facteur avec groupe de référence

\[Y = X^{(1)}\theta + E\]

  • \(Y = [Y_1,\dots,Y_n]^t\) les v.a. à expliquer.

  • \(X^{(1)}\) est la matrice encodée du facteur sans le groupe 1.

  • \(\theta = [\beta,\alpha_2,\dots,\alpha_p]^t\).

  • \(E \sim \mathcal{N}(0,\sigma^2 I_n)\).

CautionRemarques

En posant comme contrainte \(\alpha_1=0\) et \(\mu_j = \beta + \alpha_j\), on retombe bien sur le modèle

\[Y_{i,j} = \beta + \alpha_j + E_i =\mu_j + E_i, \quad E_i\overset{i.i.d.}{\sim}\mathcal{N}(0,\sigma^2)\]

\[\iff Y_{i,j}\sim\mathcal{N}(\mu_j,\sigma^2)\]

3.5 Estimateur

En refaisant les calculs avec \(\widehat{\theta} = \left({X^{(1)}}^tX^{(1)}\right)^{-1}{X^{(1)}}^tY\) on trouve

TipEstimateur

\[\widehat{\beta} = \overline{Y_1} \]

\[\widehat{\alpha}_j = \overline{Y_j} - \overline{Y_1} = \left(\frac{1}{n_j}\sum_{i=1}^{n_j}Y_{i,j} \right) - \overline{Y_1}\]

3.6 Lecture sur R

CautionRemarques

Par défaut c’est le premier facteur qui est le groupe de référence dans R

mod_c1 <- lm(Diff_poid~Diet, diet)
summary(mod_c1)

Call:
lm(formula = Diff_poid ~ Diet, data = diet)

Residuals:
    Min      1Q  Median      3Q     Max 
-5.3680 -1.4420  0.1759  1.6519  5.7000 

Coefficients:
            Estimate Std. Error t value Pr(>|t|)    
(Intercept)   3.3000     0.4840   6.818 2.26e-09 ***
Diet2        -0.0320     0.6776  -0.047  0.96246    
Diet3         1.8481     0.6652   2.778  0.00694 ** 
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 2.371 on 73 degrees of freedom
Multiple R-squared:  0.1285,    Adjusted R-squared:  0.1047 
F-statistic: 5.383 on 2 and 73 DF,  p-value: 0.006596

3.7 Loi de l’estimateur

TipLoi de l’estimateur

\(\widehat{\beta} \sim \mathcal{N}\left(\beta,\frac{\sigma^2}{n_1}\right)\)

Pour \(j\neq 1\), on a \(\widehat{\alpha}_j \sim \mathcal{N}\left(\alpha_i,\frac{\sigma^2}{n_i}+\frac{\sigma^2}{n_1}\right)\)

TipLoi de l’estimateur

Pour \(j\neq 1\): \[T = \frac{\widehat{\alpha_j}}{\sqrt{S^2(M_p)\left(\frac{1}{n_1} + \frac{1}{n_j}\right)}}\sim\mathcal{T}(n-p)\]\[S^2_{(M_p)} = \frac{SCR(M_p)}{n-p}\]

CautionRemarques

On retrouve la statistique de test de Student de comparaison de deux moyennes.

3.8 Interprétation du test de Student dans l’exemple

  1. Test de \(H_0 : \beta = 0\) contre \(H_1 : \beta \neq 0\)

\(\iff H_0 :\mu_1 = 0\) contre \(H_1 : \mu_1 \neq 0\)

Est-ce que le groupe de référence a une moyenne significativement différente de 0 ?


  1. Test de \(H_0 : \alpha_2 = 0\) contre \(H_1 : \alpha_2 \neq 0\)

\(\iff H_0 :\mu_2 - \mu_1 = 0\) contre \(H_1 : \mu_2- \mu_1 \neq 0\)

Est-ce que le groupe 2 a une moyenne significativement différente du groupe de référence ?


  1. Test de \(H_0 : \alpha_3 = 0\) contre \(H_1 : \alpha_3 \neq 0\)

\(\iff H_0 :\mu_3 - \mu_1 = 0\) contre \(H_1 : \mu_3 - \mu_1 \neq 0\)

Est-ce que le groupe 3 a une moyenne significativement différente du groupe de référence ?

3.9 Test sur R

CautionRemarques

Par défaut c’est le premier facteur qui est le groupe de référence dans R

mod_c1 <- lm(Diff_poid~Diet, diet)
summary(mod_c1)

Call:
lm(formula = Diff_poid ~ Diet, data = diet)

Residuals:
    Min      1Q  Median      3Q     Max 
-5.3680 -1.4420  0.1759  1.6519  5.7000 

Coefficients:
            Estimate Std. Error t value Pr(>|t|)    
(Intercept)   3.3000     0.4840   6.818 2.26e-09 ***
Diet2        -0.0320     0.6776  -0.047  0.96246    
Diet3         1.8481     0.6652   2.778  0.00694 ** 
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 2.371 on 73 degrees of freedom
Multiple R-squared:  0.1285,    Adjusted R-squared:  0.1047 
F-statistic: 5.383 on 2 and 73 DF,  p-value: 0.006596
NoteInterprétation
  • Le Régime 1 fait gagner en moyenne de 3.3kg, ce qui est significativement différent de 0.
  • L’écart entre le Régime 1 et 2 vaut en moyenne -0.03kg et n’est pas significativement différent de 0 : les régimes 1 et 2 ont des espérance semblable.
  • L’écart entre le Régime 1 et 3 vaut en moyenne 1.8481kg, cet écart est significativement différent de 0.

Conclusion : Comparé au régime 1 , le régime 2 n’est pas significativement différent, et le régime 3 fait gagner plus de poids.